Skip to content

Claude Code 运行机制与工程优化专项面试题

目录

1. 使用说明

  • 对应知识主题运行机制篇工程实践篇共同构成 Claude Code 运行机制与工程优化的单一知识单元;
  • 角色:资深面试官从产品与模型边界追问到 Context、工具、安全、竞品和评测;高级技术应聘者必须用可验证机制回答;
  • 回答顺序:先给 1~3 句专业短答,再给生活化解释,最后补充公开证据、工程边界和下一问;

事实红线| Claude Code 核心运行时不是完整开源实现;不知道完整 System Prompt、Compaction Prompt、内部调度和训练方法时必须明确止步。没有同模型、同任务、同权限、同预算实验,不能宣称它全面强于竞品。

  • 题目数量:7 题,严格覆盖 L1~L7。

阅读图例| L1~L2 概念与边界 · L3~L4 原理与实现 · L5 工程故障 · L6 架构选型 · L7 项目与评测

答案层级| 必答结论 · 小白解释 · 加分项 · 高频误区 · 下一问

2. 递进路线

图:Claude Code 运行机制 L1~L7 递进路线

替代文本: L1 区分 Claude 模型和 Claude Code Harness;L2 建立公开事实与闭源未知边界;L3 解释 Agent Loop;L4 落到 Context、工具、权限和恢复实现;L5 完成长任务失控故障闭环;L6 按工作流比较 Claude Code 与竞品;L7 设计并评测一个类 Claude Code 系统。

图表加载中…

读图结论: 先证明自己知道“什么是产品、什么是模型、什么是不知道”,再进入 Loop 与实现;最后必须用故障证据和公平评测回答“为什么强”,不能停在使用体验。

这条路线的关键节点各自承担不同门槛:L1 先分清 Claude 模型、Claude Code Harness 与 Agent SDK,L2 再把公开事实、合理推断和闭源未知分栏;没有这两步,后续机制很容易被写成猜测。L3 解释 Tool Use、Tool Result 与下一轮 Replanning,L4 把 Context、Cache、Compaction、权限、Sandbox 和恢复边界放回同一运行时;L5 用长任务越界和错误完工演练检验证据链,L6 才能在固定变量下比较产品架构,L7 最终把这些约束转成可验证的类 Claude Code 设计。

图:Claude Code / Agent SDK 从工具可见性到受控结果的 Harness 闭环

替代文本: Harness 在发送模型请求前先确定工具可见性:bare-name deny 会从请求中移除对应 Tool Definition,因此模型看不到也不能请求该工具。对仍可见的工具,模型可以产生 Tool Use;此时 scoped deny 或运行时 Hook 拒绝会返回未执行的拒绝 Tool Result,ask 则暂停等待,用户拒绝或请求过期同样不执行。只有获准动作才按工具类型执行;Bash 在启用时额外受 OS Sandbox 约束,直接 Edit/Write 前建立 File Checkpoint,结果再写入会话驱动下一轮。

图表加载中…

读图结论: bare-name deny 在请求前改变工具可见性,因此不会产生该工具的 Tool Use 或拒绝 Tool Result;scoped/runtime deny 与用户在 ask 中拒绝则发生在 Tool Use 之后,都会阻止执行并把拒绝反馈给模型。只有获准的 Bash 才可能进入 Sandbox,执行结果再驱动下一轮。

图中的工具可见性、PermissionSandboxCheckpointSession 解决不同问题。Agent SDK 的 bare-name disallowedTools 会在请求装配阶段移除整个工具定义,模型不知道这个工具存在;带参数范围的 scoped deny 或运行时 Hook 仍让模型看见工具,但在它发出 Tool Use 后拒绝调用并回传原因。ask 只是在批准点暂停,用户拒绝、回调返回 deny 或请求过期都不执行动作。随后,Sandbox 主要约束 Bash 及其子进程,Checkpoint 只覆盖直接文件编辑的本地回滚,Session JSONL 保存消息与工具轨迹;数据库、API、部署和远程 Git 等副作用不在文件 Checkpoint 的恢复范围内。

3. 一问一答

第 1 题|L1 概念|Claude Code、Claude 模型和 Claude Agent SDK 分别是什么?

核心考察点| 模型决策、Harness 控制、产品与 SDK 边界

面试官提问

请说明三者职责,并解释为什么 Claude Code 不是“给 Claude 加一个终端”这么简单。

30 秒专业短答

Claude 模型负责理解代码、推理并提出文本或工具动作。Claude Code 是面向软件工程的 Agentic Harness,负责上下文、循环、工具、安全和恢复;Claude Agent SDK 让开发者程序化复用相近能力。实际效果来自模型与 Harness 的组合,不是某一个 Prompt。

深入展开

一次运行中,模型只产生候选动作;Harness 组装 Coding System Prompt、Project Context 和历史,执行 Tool Use,把 Observation 回灌,并控制 Permission、Sandbox、Session 与终止。SDK 不是无状态 HTTP 薄封装:官方 Hosting 文档描述其监督独立 CLI 子进程并维护 Session。因此排障要先分清模型理解错误、Context 缺失、工具失败和策略拒绝。

小白解释

新工程师小林要修一台设备:他用大脑分析问题,借助工位上的终端、测试台和门禁实际操作,平台团队又把这套工位做成零件供其他车间复用。这里大脑对应 Claude 模型,完整工位对应 Claude Code Harness,工位零件对应 Agent SDK。回到专业机制,模型产生候选动作,Harness 负责上下文、执行和状态,SDK 提供程序化构建入口。类比只解释职责分工:模型并非脱离 API 独立行动,Harness 也不是完全确定性的自动化系统。

事实与证据边界

Agent Loop、System Prompt Preset 构成和 SDK Hosting 架构有 Anthropic 官方文档支持;完整 Runtime 源码、逐字 System Prompt 和模型训练方式没有公开,不能由产品行为反推出实现细节。

  • 合格线| 模型提议动作;Harness 负责循环、执行、状态、安全与终止;SDK 是程序化构建入口;
  • 加分项| System Prompt、Project Context、Tool Schema、Observation 和 Checkpoint 分属不同控制面;
  • 工程证据| SDK 消息类型、Tool Use/Tool Result Transcript、Permission 记录、Session ID 和实际文件 Diff;
  • 高频误区| 说 Claude Code 是单独训练的新模型,或说 Agent SDK 只是一次 HTTP API 包装;
  • 下一问| 职责区分后,继续说明闭源产品哪些能证实、哪些不能。

第 2 题|L2 边界|你怎么证明自己讲的是运行机制,不是社区猜测?

核心考察点| 官方事实、架构推断、内部未知和时间快照

面试官提问

请各举两个“可验证事实、合理推断、无法确认”的例子,并说明为什么不能反编译后就当官方事实。

30 秒专业短答

我把结论分成官方可验证事实、基于证据的架构推断和当前无法确认三类。Tool Result 回灌、只读工具并发和 Checkpoint 边界是事实;模型与 Harness 协同是推断;完整 Prompt、私有调度、训练数据和公平竞品胜率没有公开,我会明确说不知道。动态能力还必须标注版本和访问日期。

深入展开

事实至少用官方产品文档、SDK 类型或 Changelog 定位;推断必须说明由哪些可观察行为支持,且不用“已证明”措辞;未知项列入待验证清单。公共 GitHub 仓库只公开 Issues、插件、示例和发布资料,核心许可为 All Rights Reserved,不能等同完整开源实现。旧工程 Blog 只能证明当时设计,除非当前文档或实验再次确认,否则不能当永久契约。

小白解释

验车员先实测汽车能否刹车,再阅读说明书中的制动距离;他可以根据底盘和轮胎提出“可能更适合弯道”的判断,却不能在没有拆解图时背出控制器源码。实测与说明书对应官方事实,结构判断对应基于证据的推断,臆测源码对应当前无法确认。回到专业机制,公开文档、SDK 事件和可复现实验决定证据等级。类比忽略了软件版本快速变化,因此每个动态结论还必须带版本与访问日期。

事实与证据边界

本题的产品快照是 2026-07-10,依据 Anthropic 官方文档与 Changelog;版本、默认模型、实验能力和许可都可能变化。反编译结果最多是某个二进制快照的观察,还涉及许可与完整性问题,不能自动升级为官方架构承诺。

  • 合格线| 三类证据分开,至少说出完整 Prompt、内部调度和竞品优势无法确认;
  • 加分项| 说明公共行为可以用 SDK 文档、Changelog 和可复现实验交叉验证,但不能越过许可与证据边界;
  • 工程证据| 官方 URL 与访问日期、版本号、SDK 事件、Changelog 条目和可重复的黑盒实验记录;
  • 高频误区| 把旧版 Blog 当永久契约,或把厂商内部数据当独立行业基准;
  • 下一问| 证据边界建立后,开始按消息和工具时序展开 Agent Loop。

第 3 题|L3 原理|一次 Claude Code 请求内部如何从目标走到验证完成?

核心考察点| 请求上下文、Tool Use、Permission、Observation、Replanning 与终止

面试官提问

请以“修复失败测试”为例,讲清模型和运行时每一步分别做什么。

30 秒专业短答

Harness 把 System Prompt、项目上下文、工具和历史交给模型;模型返回文本或 Tool Use。运行时裁决权限并执行工具,把真实结果作为 Observation 回灌,模型据此继续规划。默认在模型不再请求工具时结束;可选 Goal/Stop Hook 能追加外部验收,策略、预算、错误或用户中断也会停止运行。

深入展开

以失败测试为例,模型先请求 Bash;Hook 和 Permission 决定能否执行,启用的 Bash 还受 OS Sandbox 约束。退出码和 stderr 回灌后,模型调用 Grep/Read/LSP 获取局部证据,再提出 Edit;Harness 在直接编辑前建立 Checkpoint,编辑后返回诊断并重跑测试。同轮只读工具可并发,有状态工具顺序执行,以减少墙钟时间和写冲突。

小白解释

小林接到“修好故障设备”的目标后先查手册,请求在测试台复现;门禁允许后,测试台返回错误,他再拆检、换件并复测。手册对应 Context,操作请求对应 Tool Use,门禁对应 Permission/Sandbox,测试结果对应 Observation,重新判断对应 Replanning。回到专业机制,Harness 执行动作并把 Tool Result 交回模型,直到停止或通过外部验收。类比没有表达模型输出的概率性,也不能保证测试台覆盖了全部真实故障。

事实与证据边界

Tool Use/Tool Result 消息流、并发策略和权限模式来自官方 Agent SDK 文档;具体模型为什么选择某个工具、内部 Replanning 与终止启发式没有公开。测试和网络结果也可能非确定,不能把“运行时执行”误称为全部确定性。

  • 合格线| 上下文装配 → 模型动作 → 权限/沙箱 → 工具 → Observation → 继续/停止;
  • 加分项| 同轮只读工具可并发,Edit/Write/Bash 等改变状态的工具顺序执行;最终文本只是终止信号,项目测试才是完成证据;
  • 工程证据| 完整 Transcript、Tool 参数与结果、权限裁决、命令退出码、LSP 诊断、Checkpoint 和权威测试;
  • 高频误区| 说模型直接执行 Shell,或认为一个 Tool Call 就等于完整 Agent;
  • 下一问| Loop 清楚后,继续解释如何让它在长会话中不被 Context、费用和副作用拖垮。

第 4 题|L4 实现|项目文件如何分工,并同时优化 Context、成本、延迟和安全?

核心考察点| 项目文件生命周期、Cache、Compaction、延迟加载、Subagent、Hook、LSP、Permission 与 Checkpoint

面试官提问

请先说明主要项目文件各自存什么、何时加载,再说明至少五项运行机制分别优化什么,以及为什么不能把所有内容塞进一个超长 CLAUDE.md

30 秒专业短答

CLAUDE.md 与 Rules 管常驻或路径限定的项目上下文,Skills 按需加载流程,Agents 隔离工作,settings.json 管权限和 Hook,.mcp.json 声明外部工具,Session/Memory/Checkpoint 保存不同状态。Prompt Cache、Compaction 和延迟加载优化重复计算与 Context,Permission、Sandbox、Worktree 控制副作用。长 Context 只增加容量,不能替代配置、隔离和恢复。

深入展开

CLAUDE.md 放每个相关会话都需要的架构、权威命令与验收;无路径条件的 Rules 常驻,有 paths 的 Rules 在读取匹配文件时加载;Skill 正文按需进入主 Context,Agent 在独立 Context 工作;settings.json 的 Permission、Hook 与 Sandbox 属于客户端控制面,.mcp.json 是团队外部工具配置。Session JSONL 保存完整轨迹,Auto Memory 保存跨会话笔记,Checkpoint 保存直接文件编辑前快照;团队配置提交 Git,Local 和 ~/.claude 数据留在本机。运行时再用 Exact-prefix Cache 复用稳定前缀,用 Compaction 有损缩短历史,用 LSP/CLI/Hook 承担确定性处理,并用 Worktree 隔离并行 Writer。

小白解释

小林修支付故障时,先看墙上的项目总手册;进入支付区才看到模块 SOP,需要数据库知识时再取专业手册或请隔壁专家调查,门禁与录像系统独立工作。总手册对应 CLAUDE.md,模块 SOP 对应 Rules,专业手册对应 Skill,专家对应 Agent,门禁对应 Settings,外部联系册对应 .mcp.json,录像和便笺对应 Session 与 Memory。回到专业机制,这些文件分别进入 Context、约束运行时、扩展工具或保存状态,再由 Cache、Compaction 和隔离降低成本。类比只解释分层:自然语言手册不是安全策略,录像不等于可信数据库,文件备份也不能撤销远程副作用。

事实与证据边界

项目文件路径、配置作用域、Cache、Context 成本、Compaction、Subagent、Hook 和 Sandbox 的公开行为有官方文档支持;精确压缩 Prompt、摘要打分、ToolSearch 内部路由和 Cache 后端实现未公开。AGENTS.md 需要由 CLAUDE.md 显式导入或链接;.claude/hooks/ 只是可选脚本目录约定,真正的 Hook 在 Settings 注册。Fork Subagent 会继承父上下文,不能把所有 Subagent 都描述成 Fresh Context。

  • 合格线| 能把 Instructions、Settings、Extensions、Runtime Data 分开;机制职责正确:Cache≠压缩、Compaction≠记忆、Subagent≠Worktree、Prompt≠权限;
  • 加分项| 说明 CLAUDE.local.md/settings.local.json 不提交,MCP 密钥不进仓库,模型/Effort/部分工具集合变化会 Cache Miss,Checkpoint 不追踪 Bash/远程副作用;
  • 工程证据| /memory/context、Settings Scope、Git Ignore、Usage/Cache 指标、Compact Boundary、Skill/MCP 加载事件、Hook 日志、Subagent Summary、Sandbox 拒绝和恢复演练;
  • 高频误区| 把所有知识塞进 CLAUDE.md,认为 AGENTS.md 原生加载、.claude/hooks/ 自动发现、1M Context 可取消分层,或把 Auto Memory 当可信数据库;
  • 下一问| 机制能说清后,用一次长任务失控演练检验排障能力。

第 5 题|L5 工程|长任务压缩后扩大修改范围并错误宣称完成,怎么闭环排查?

核心考察点| Context 证据、真实仓库、权限链、验收、止损和防复发

面试官提问

请按现象、证据、根因、止损、修复、验证和防复发回答;不要只说“重新 Prompt 一次”。

30 秒专业短答

我先中断 Agent、冻结远程动作并保存 Session/Diff,核对真实 Git 状态、权威测试和修改范围。然后按规则加载、Context/Compaction、Tool/Permission 和退出码定位根因,恢复到可信 Checkpoint 或 Worktree。最后把验收外置并做压缩、失败测试和越权回归,不能只重新 Prompt。

深入展开

现象是修改越界且最终消息与测试矛盾;证据包括 Compact Boundary、/context、Transcript、CLAUDE.md/Memory、Tool Call、Permission/Sandbox 拒绝和真实退出码。根因可能是验收只存在早期对话、摘要丢失、测试目录错误或规则陈旧。止损后用 Rewind/Checkpoint/Git 恢复,把永久规则放到根 CLAUDE.md,任务验收写成外部清单;可选用 Goal/Stop Hook,并让 CI 做最终独立门禁。监控新增范围异常、重复失败和无验证完成告警。

小白解释

夜班接班人只看到错误摘要,误把隔壁房间也拆了;负责人先停工、封锁外部施工,再对照现场、正式图纸和验收单恢复。摘要对应 Compaction,现场对应 Git Diff,正式图纸对应 CLAUDE.md/外部任务清单,验收员对应测试、CI 或 Goal/Stop Hook。回到专业机制,应按真实状态、Context、Tool 与 Permission 证据闭环排查。类比不能让本地回滚自动恢复数据库、部署或已发送消息,这些影响必须另行对账和补偿。

事实与证据边界

这是生产风险演练,不代表本文观察到真实事故。默认 Agent Loop 在模型不再请求工具时可以结束;只有配置 Goal、Stop Hook 或外部编排后,独立验收才会自动触发下一 Turn。Checkpoint 不覆盖 Bash 写入和远程系统,相关影响必须外部对账。

  • 合格线| 真实 Diff/测试优先,检查 Context/规则/工具/权限,先止损再恢复,最后做压缩与失败注入回归;
  • 加分项| 区分 Conversation Rewind、File Checkpoint、Git/Worktree 和外部业务补偿;记录 Cache Miss 只是性能证据,不把它误当语义根因;
  • 工程证据| Session/Compact 事件、Git Diff、测试退出码、Permission/Sandbox 日志、外部请求 ID、恢复前后文件哈希和回归报告;
  • 高频误区| 清空记录后重跑、完全归因模型变笨,或本地回滚后假设数据库和部署也已回滚;
  • 下一问| 排障闭环完成后,继续把 Claude Code 放回当前竞品架构中做条件性选型。

第 6 题|L6 架构|Claude Code 为什么强,又为什么不能说全面强于 Codex、Gemini CLI 和 Copilot?

核心考察点| 工作流定位、模型/Harness 混杂变量、反向优势与公平选型

面试官提问

请给出 Claude Code 的真实差异化,也主动说出三个竞品更合适的场景。

30 秒专业短答

Claude Code 基于公开机制更可能适合复杂本地长会话,因为 Context 治理、Steering、并行、Worktree、Rewind 和权限组合紧密。它并非全面占优:Codex/Gemini 的开源 Runtime、Gemini 的开放互操作、Copilot 的 GitHub PR 治理各有优势。没有同条件隐藏测试,只能给条件性选型,不能说全面最强。

深入展开

先把 Surface 分开:Inline Completion、本地 CLI Agent、Desktop/Cloud 多 Agent 和异步 PR Agent 不是同一问题。Claude 更值得在本地复杂修改、频繁接管和细粒度恢复上评测;Codex 产品族可结合开源 CLI、App 与 Cloud,Gemini CLI 强调长上下文、Google Search 和 A2A,Copilot Cloud Agent 在临时 Actions、受限分支、PR、安全扫描和人工合并上更直接。公平实验要固定仓库、版本、模型/Effort、联网、权限、预算和验收,报告 Verified Success、干预次数和总成本。

小白解释

车队要完成山路抢修、开放改装实验和工厂流水线维护三种任务,负责人不会只看哪辆车工具最多。Claude Code 维修车对应复杂本地交互与接管,Codex/Gemini 开放设备对应可审查或互操作的 Runtime,Copilot 流水线维修工对应 GitHub PR 治理。回到专业选型,必须固定仓库、模型、权限、预算和测试后比较 Verified Success。类比没有证明任何产品在所有道路都更快,也会随产品版本变化而过期。

事实与证据边界

对比快照为 2026-07-10,来源是四家官方产品文档与开源仓库;功能只证明“具备机制”,不证明模型质量、速度、成本或成功率。Codex 一列若包含 App/Cloud 能力必须标 Surface,Agent Teams 也应标为实验性。

  • 合格线| 说出 Claude 的条件性优势和至少三项竞品反向优势;
  • 加分项| 区分 Inline Completion、本地交互 Agent、Cloud PR Agent;指出 Agent Teams 仍实验性且成本随实例增长;
  • 工程证据| 固定任务清单、产品/模型版本、权限快照、隐藏测试、Tool Trace、人工干预、费用与墙钟时间;
  • 高频误区| 用旧印象说竞品没有 MCP/Subagent/Memory/Sandbox,或把 Claude 模型能力等同产品 Harness 优势;
  • 下一问| 最后设计一个类 Claude Code 系统,并给出能拆分模型与 Harness 的评测方法。

第 7 题|L7 项目复盘|如果让你设计并评测一个“类 Claude Code”Coding Agent,你会怎么做?

核心考察点| 控制面划分、上下文生命周期、验证协议、故障演练和证据边界

面试官提问

请说明系统架构、最难问题、可验证亮点、代表性风险和竞品评测;当前能否说成真实上线项目?

30 秒专业短答

这是示例设计:模型负责计划和候选动作,Harness 负责 Context、工具调度、权限、Sandbox、状态和终止,Hook/LSP/CI 做确定性校验,Checkpoint/Worktree 负责本地恢复。最难的是同时保证有效证据、安全自治和外部验收。我会用固定仓库隐藏测试、干预次数、总成本、越权率和恢复时间验证,当前不能声称已上线。

深入展开

架构上把核心规则放项目指令,Rules/Skills/MCP 按需加载,非 Fork Subagent 隔离高噪声任务;工具 Schema 标注副作用,只读可并发、写入顺序执行。服务端持有身份和资源授权,远程写用幂等键、对账与补偿。评测先固定模型做 Harness A/B,再固定 Harness 做模型 A/B,多次运行并分类 Context、Tool、Permission、Environment、Model 与 Verification 失败;故障注入覆盖压缩丢失、恶意文件、外部成功但响应丢失和并行冲突。

小白解释

设计新工厂时,小林让工程师决定维修方案,让门禁、工具管理员、质检员和备份系统执行固定职责,再用同一批故障机器和隐藏验收单比较不同班组。工程师对应模型,工厂调度对应 Harness,门禁对应 Permission/Sandbox,质检对应测试与 CI,备份对应 Checkpoint/Worktree。回到专业架构,模型负责开放式决策,确定性 Runtime 负责执行、安全、状态和验收。类比忽略了模型 API、许可证、数据保留和外部系统授权;没有真实实现和运行数据时只能说“示例设计”。

事实与证据边界

当前仓库只有架构文章和评测方案,没有类 Claude Code Runtime、运行日志、真实用户、事故或指标;因此只能说“示例设计”和“计划验证”。目标系统还必须重新核对模型 API、Sandbox、许可证、数据保留和第三方工具协议。

  • 合格线| 模型/运行时职责、Context 分层、权限与恢复、外部验收和公平评测全部覆盖;
  • 加分项| 固定模型做 Harness A/B,再固定 Harness 做模型 A/B;记录失败分类和多次运行方差;远程副作用设计服务端授权、幂等、对账和补偿;
  • 工程证据| 架构决策记录、版本化任务集、隐藏测试、Trace/Metric/Log、权限审计、故障注入、恢复记录和人工 Review;
  • 高频误区| 只画模型加 Bash 两个框,或用模型自评、单次 Demo、SWE-bench 总分替代目标仓库验收;
  • 下一问| 本组结束;可继续追问多租户进程隔离、Prompt Cache Telemetry、Tool Schema 版本治理和评测集维护。

4. 自测与评分

  • [ ] 能在 30 秒内区分 Claude 模型、Claude Code 和 Agent SDK;
  • [ ] 能列出至少 5 项官方可验证事实和 5 项无法确认的内部实现;
  • [ ] 能手画 System/Project/Conversation 三层 Context 与 Tool Result 回灌;
  • [ ] 能画出 CLAUDE.md、Rules、Settings、Skills、Agents、MCP、Session、Memory 与 Checkpoint 的职责边界,并解释哪些应提交 Git;
  • [ ] 能按“真实仓库 → 工具权限 → Context → 模型”的顺序排查长任务失控;
  • [ ] 能主动说出 Codex、Gemini CLI、Copilot 的反向优势;
  • [ ] 能设计隐藏测试、人工干预、总成本、越权和恢复指标,并重复运行报告方差;
  • [ ] 按准确性、原理深度、工程意识、项目表达、沟通结构各 0~5 分评分;
  • [ ] 第 7 题不得虚构上线、成功率、成本、团队规模或竞品胜率。

5. 事实边界与参考资料

当前无法确认| Claude Code 完整 System Prompt、Compaction Prompt、私有 Tool/Delegation/Termination 逻辑、训练数据、内部评测集,以及与竞品在同变量实验下的普遍胜率。

6. 总结

一句话记忆: 回答 Claude Code 要从“模型 + Context + Harness + Tool + Verification + Safety + Recovery”完整闭环出发,并用证据边界和公平评测约束“更强”的结论。

  • Claude 模型负责概率性决策,Claude Code Harness 负责确定性的循环、执行、权限、状态和终止;
  • CLAUDE.md/Rules、Settings、Skills/Agents/MCP、Session/Memory/Checkpoint 分别管理上下文、控制、扩展和状态;Prompt Cache、Compaction、延迟加载与隔离再解决不同的 Context 成本;
  • Permission、Sandbox、Checkpoint、Git 和业务补偿覆盖不同安全与恢复范围;
  • 当前 Coding Agent 原语高度对齐,Claude 的优势是复杂本地工作流中的组合与可接管性,不是全面独占;
  • 不知道闭源内部实现就明确止步,项目亮点必须由测试、Trace、Diff、故障演练和重复评测证明。